ГигаЧат: новые модели для работы со звуком
Источник: https://t.me/SberAIScience/4389
Краткое содержание
Sber AI выложил в Open Source две модели для работы со звуком: GigaChat Audio и GigaAM Multilingual. Обе приняты на Interspeech 2026 -- главную мировую конференцию по речевым технологиям.
GigaChat Audio -- это audio-native LLM, способная обрабатывать до 2 часов аудио, удерживая контекст. Модель умеет находить нужные фрагменты в длинных записях, создавать саммари с таймкодами и распознавать эмоции говорящего с точностью более 90%. На бенчмарке RuBQ-Audio она показывает результат 60,0 против 43,7 у Qwen3-Omni.
GigaAM Multilingual расширяет SOTA-модель распознавания речи на казахский, киргизский, узбекский и английский языки. Компактная версия на 240M параметров превосходит Whisper Large v3 и Omnilingual 1B. Благодаря предобучению на 2 млн часов речи на более чем 70 языках модель адаптируется к новым языкам с минимумом данных, достигая WER около 4% против 11%+ у Whisper.
Значимость
Публикация двух моделей в Open Source и их принятие на Interspeech 2026 укрепляют позиции Сбера в области речевых технологий, особенно в обработке русскоязычной речи и мультиязычном распознавании для языков СНГ.
🧾 Транскрипт (формат)
🚫 СТОЙТЕ, ГИГАЧАТ ХОЧЕТ ОТВЕТИТЬ
Источник: https://t.me/SberAIScience/4389
🚫 СТОЙТЕ, ГИГАЧАТ ХОЧЕТ ОТВЕТИТЬ
Мы выложили в Open Source сразу две модели для работы со звуком: audio-native LLM GigaChat Audio и мультиязычное SOTA-распознавание речи GigaAM Multilingual. Обе работы приняты на Interspeech 2026 — главную мировую конференцию по речевым технологиям 🔥
Чем силён GigaChat Audio?
🤩 Понимает длинные записи
Держит контекст до 2 часов аудио и свободно ориентируется внутри: находит момент, где обсуждали нужную тему, пересказывает фрагмент, собирает саммари с таймкодами. На записях 20–60 минут точность локализации событий — 48.3 IoU против ~0 у Voxtral, Phi-4 и Qwen3-Omni 🤩 Считывает эмоции
По интонации и манере речи распознаёт настроение говорящего — 90%+ на бенчмарке Dusha — и учитывает его в ответе 🤩 Распознаёт русский на слух лучше аналогов
RuBQ-Audio: 60,0 против 43,7 у Qwen3-Omni. А ещё — multi-turn диалог, перевод, классификация аудио и распознавание речи в одной модели
GigaAM Multilingual — расширение нашей SOTA-модели распознавания речи на казахский, киргизский, узбекский и английский. Компактная версия на 240M параметров обгоняет Whisper Large v3 и Omnilingual 1B, а аудиоэнкодер, предобученный на 2 млн часов речи на 70+ языках, адаптируется к новым языкам с минимумом данных: на грузинском и башкирском хватило одного Common Voice, чтобы дойти до WER ~4% против 11%+ у Whisper
Ценность обеих моделей и предложенных методов уже подтвердило научное сообщество — наши статьи приняли на главную мировую конференцию по речевым технологиям Interspeech 2026
Модели уже работают в ГигаЧате: общайтесь голосом, присылайте голосовые сообщения и аудиофайлы.
Разработчикам предлагаем забрать GigaChat Audio и GigaAM Multilingual в Open Source вместе с датасетом TimeGround-1M
А если интересна техническая часть, читайте пост команды ↖️
✔️ Подписывайтесь на Sber AI в МАКС